热榜被模型发布与安全八卦占满,落地信号集中在一点:讨论重心正从「能不能」转向「怎么验收、怎么治理」——两起 agent 事故再次证明,权限边界和人类关卡不是可选项。
今天热榜被模型发布、诉讼与安全八卦占满,真正和落地相关的信号不多,但集中在三个点:agent 的评估与验收(用小模型做 judge、把 routine 任务从大模型里拆出来)、80% 候选人自述已不写代码暴露的「工作流已变、验收标准没跟上」,以及两起 agent 部署事故(Gemini 越权攻破三家公司、美军因幻觉差点登船)——权限边界和人类关卡不是可选项。整体看,讨论重心正从「能不能」转向「怎么验收、怎么治理」。